1北京林业大学信息学院
2北京航空航天大学人工智能学院
3国家林业草原林业智能信息处理工程技术研究中心
TL;DR提出ISFL模型,在图像域实现人脸语义的局部分离和全局融合,用户可通过掩模单独编辑人脸不同语义的结构和外观,并支持基于优化和基于编码器两种细节优化方式。
人脸图像编辑模型中语义属性间关联性强,编辑一种语义可能导致其他属性和非编辑区域的改动。本文提出ISFL模型,使用图像掩模将人脸语义分离并组织为层次化树状结构,通过局部编码器、语义融合器和全局生成器实现对图像语义的局部分离和全局融合,支持用户通过掩模单独编辑不同语义的结构和外观。
现有人脸编辑方法缺乏对面部结构或外观的直接控制,语义属性间关联性强导致编辑一种属性时影响其他属性,且交互复杂耗时,不能满足易用性和即时性要求。
核心思想是将人脸语义在图像域分离为结构特征(边缘、纹理)和外观特征(色调、色彩),分别编码后通过语义融合器基于MLP-Mixer机制融合,映射到StyleGAN2的W+潜在空间,实现精准的局部语义编辑。
包含结构编码器(基于FPN+ResNet提取多尺度结构特征)和外观编码器(浅层卷积+GAP提取独立于结构的外观特征),分别生成结构和外观向量。
基于MLP-Mixer的SE-MLP模块,通过SemanMixer中的Modulation机制将外观特征融入结构特征,映射到StyleGAN2的W+潜在空间。
提供基于优化(PTI+Gram矩阵损失,质量更高)和基于编码器(结构残差编码+门控融合,速度更快)两种方式优化生成图像细节。
ISFL模型由三部分组成:局部编码器分别提取结构和外观特征,语义融合器通过Modulation机制将外观融入结构并映射到W+空间,全局生成器使用预训练StyleGAN2生成图像。编码器学习的是相对于平均潜在向量的偏移量,加速训练收敛。
SE-MLP模块在MLP-Mixer基础上增加SemanMixer融合模块。SemanMixer将结构特征分为低分辨率和高分辨率两部分,仅将高分辨率部分输入Modulation融合模块与外观特征交互,低分辨率部分直接传递,确保全局结构语义和局部结构语义间的自然过渡。
Modulation机制将外观特征编码为风格编码,通过计算解调因子调制全连接层权重,实现外观对结构特征的注入。这种设计参考了StyleGAN2中的风格注入机制,但应用于MLP而非卷积层。
| 方法 | FID↓ | IS↑ | LPIPS↓ | ID↓ |
|---|---|---|---|---|
| pix2pixHD | 0.84 | 3.01 | 0.52 | 0.28 |
| DeepFaceEditing | 1.79 | 2.87 | 0.56 | 0.30 |
| ISFL (编码器) ours | 0.85 | 2.79 | 0.52 | 0.26 |
| ISFL (优化) ours | 1.09 | 3.19 | 0.51 | 0.26 |
在CelebAMask-HQ数据集上,ISFL在IS、LPIPS和ID指标中均达到最优,生成图像质量更高、感知更真实、身份特征保留更好。基于优化的方法生成质量更高,基于编码器的方法在1秒内完成编辑,速度可接受。
将人脸语义在图像域分离为结构和外观特征,通过Modulation机制在融合阶段注入外观信息,是实现精准局部人脸编辑的有效途径。层次化的语义组织结构支持同时编辑多个语义属性。
@article{xia2024isfl,
title={基于语义分离和特征融合的人脸编辑方法},
author={夏垚铮 and 郝蕾 and 郑宛露 and 潘成伟 and 王少荣},
journal={计算机辅助设计与图形学学报},
volume={37},
number={3},
pages={414--426},
year={2024},
issn={1003-9775},
doi={10.3724/SP.J.1089.2024-00305},
url={https://www.jcad.cn/cn/article/doi/10.3724/SP.J.1089.2024-00305}
}